豪!上一篇把定義講過一輪之後,應該能回答這個問題了。
把一萬篇 PDF 論文貼給 chatGPT 叫它整理,算不算一種知識庫?
我的答案是:也許能做到類似知識庫,但不算知識庫。
AI 處理東西是有上下文限制的,尤其是聊天形式的對話型機器人,在這層限制下,首先就塞不下一萬篇這麼多的 PDF 了,其次,對話不是以檔案為基礎,而是以文字、Token 為基礎,那麼當你要「提取」時,AI 會怎麼做?
整包掃一次,這就是 AI 會做的事。
不論你用多高階的模型都一樣,跳過了整理這個步驟,AI 的搜尋能力會變得超爛,只要你的問題稍微籠統一點,它給你的答案就能把你繞偏,等你看完 AI 的回覆搞不好你已經忘記當初問的是什麼(chatGPT就是在說你)。
所以,經過結構整理、內容整理、脈絡整理、關係整理、品質整理等動作後,AI 才開始從「我可能知道,不知道就猜」,進化成「我知道」。
這邊讀者不需要知道上面那五種整理具體是什麼,只需要知道:整理做得不好,提取就整個爛掉,最後還是會回到「整包掃」。

那怎樣算是做得好勒?
這幾條是我自己維護知識庫時,訂給自己的標準,只要做得到上面四條,我們可以說這個知識庫整理得很好,很有用。
其實在寫這段的時候,本來是想把整理定調為「一定要有人類參與」,因為資料怎麼派上用場,使用者本人的研究脈絡、價值判斷,都是跟使用者高度相關,講白點,寫進資料庫的文字很多跟人的「感覺」有關,這也是為什麼我的標題這樣寫: AI 只能做兩種 。
但仔細想想,我憑什麼決定大家要怎麼用知識庫,如果有人能把規則訂得很明確,檢查機制也做好,那麼知識庫沒有人類參與可能也沒問題,而且到最後不管大家怎麼用,為知識庫負責的永遠是維護者(你),總之。
我在上篇舉了五種整理的例子,我認為這概括我所知的所有整理類型,分別是:結構整理、內容整理、脈絡整理、關係整理、品質整理,其中結構整理及內容整理是無庸置疑交給 AI 比較好、比較快的兩種。
我想討論的是比較模糊,比較慢的三種類型:脈絡整理、關係整理、品質整理,這三種我認為是沒有「絕對正解」的整理。
怎樣沒有正解?我直接給例子會比較有畫面:
今天有一個知識庫是這樣分類的:
長期計畫放 02-Areas 代表生活領域、短期專案放 01-Projects。
此時兩份筆記入庫。
一份是股票 0050,大盤的十年走勢研究,是長期投資的整體規劃筆記。
另一份是股票 NVDA,這支是使用者有閒錢才考慮,是為了短期進場出場才研究的投資筆記。
問題來囉,這兩份要歸到 01-Projects 還是 02-Areas?
投資這個主題是生活領域,但是短期投資,還是放在生活領域嗎?
我繼續延伸。
假設我們把 0050 那份筆記放在 02-Areas,NVDA 這份因為是當沖用,放在 01-Projects。
半年後,俄羅斯將炮火對準外星人,發動宇宙大戰,這時候因為種種原因 0050 不再是長期穩定的投資標的了,而是短期當沖用的標的,那你整理的時候 0050 這份筆記要放在哪裡?
我想說的是,所謂的沒有「正解」,就是
當內容出自使用者的理解、並且會隨外部世界變動,這樣的資訊,難以透過事先訂好規則,就放手讓 AI 去做,舉凡股票、美感、專案完成度、健康/運動強度、職涯機會評估都是。
另一方面,如果大部分內容都是有正解的,像是「筆記完成後要貼上 Done 狀態」,有結束的一天就列為 01-Projects,沒有終點的長期維護就列為 02-Areas,這種黑白分明的判斷就完全可以交給 AI。
這就是人機分工的界線,讀者在享受 AI 代理知識庫維運的同時,要是能掌握好這個界線,那整理這個動作你會做得很好,規則清楚的部分放心交給 AI 省時間,答案需理解且會變動的留著自己判斷——你撈到的資料才會完全符合你的理解,整理過程也才真的輕鬆不費力。